Skip to content

Minmaxing of bayesian improved surname geocoding and geography level ups in predicting race

Clark, Curiel, Steelman (2021)

DisciplineSocial science
MethodComputational
Tagsbayesian methodsdata · archival recordsgeographic scalemethod · descriptive statisticsmethod · simulationrace predictionsurname geocodingvoter files

Summary

Problem: 尽管BISG(贝叶斯改进姓氏地理编码)已成为从生态数据推断个体种族的主流方法,但现有研究在使用地理层级上差异巨大——有的使用精确的普查块,有的仅用姓氏或县级分析,有的完全跳过地理编码。然而,这些不同地理层级在推断准确性上的权衡尚不明确,且地理编码本身耗时耗钱并导致大量数据缺失。研究者缺乏一个明确的指南来判断何时必须使用地理编码、何时可以用非地理编码替代。 Approach: 作者利用佐治亚州选民档案(该州包含选民自报种族信息)作为验证数据,对五种BISG地理层级进行系统比较:仅姓氏、县、ZIP码(新引入)、普查区(tract)和普查块(block)。他们开发了R包zipWRUext来扩展wru框架以支持ZIP码级别的BISG分析,并通过10,000次自助抽样(每次1,000人)比较各方法推断结果与自报种族之间的绝对差异。 Finding: ZIP码和普查区在推断白人和黑人种族时几乎完全等效,且ZIP码与普查块在白人和黑人推断上也无实质性差异。然而,在推断亚裔和西班牙裔种族时,普查块显著优于ZIP码和普查区。县级和仅姓氏的估计误差最大,应尽量避免使用。 Significance: 该研究为BISG使用者提供了明确的操作指南:对于白人和黑人种族的推断,ZIP码是最优的非地理编码选择,可以完全避免地理编码的成本和数据缺失;对于亚裔和西班牙裔,则需要使用普查块。这大幅降低了BISG的使用门槛,使更多研究者能够在不牺牲准确性的前提下使用该方法。

Theoretical Framework

  • Theoretical tradition: 该方法论研究属于政治学中的生态推断(ecological inference)传统,是定量方法论领域的方法论改进研究。
  • Prior theories built upon: 该研究建立在King (1997)的生态推断问题框架、Robinson (1950)的生态谬误(ecological fallacy)理论、Elliott et al. (2008)提出的BISG方法,以及Imai and Khanna (2016)的wru R包实现之上。
  • Causal mechanism: 核心机制是:个体的姓氏和居住地(地理单元)与种族之间存在统计关联——姓氏携带种族信息(如西班牙裔姓氏、亚裔姓氏),而居住地的种族构成(来自人口普查数据)也携带种族信息。BISG通过贝叶斯方法将这两个信息源结合,计算个体属于各种族类别的后验概率。地理单元越小(如普查块),其种族构成越能精确反映该个体的居住环境,但代价是地理编码成本和数据缺失增加。
  • Key assumptions: 该方法假设:(1) 姓氏与种族之间存在稳定的统计关联;(2) 居住地的种族构成(来自人口普查/ACS数据)能反映该地居民的实际种族分布;(3) 自报种族是准确的基准(ground truth);(4) 人口普查数据与选民档案数据在时间上足够接近。
  • Theoretical move: 本文扩展了Imai and Khanna (2016)的wru框架,通过引入ZIP码这一新的地理层级来应用检验现有BISG理论在不同地理粒度下的表现。它不是挑战BISG的基本逻辑,而是优化其实施策略,提供"何时用何种地理层级"的实证依据。
  • Scope conditions: 该研究基于佐治亚州选民档案,佐治亚将西班牙裔视为一个种族类别(而非族裔),这与北卡罗来纳等州不同。作者指出,可修改面积单元问题(MAUP)可能使结果在不同地理情境下有所差异,因此结果是保守估计。此外,种族认同是流动的概念,自报种族本身可能存在误差,尤其对亚裔和西班牙裔而言。

Research Design

本研究属于验证性研究(validation study),使用佐治亚州选民档案作为验证数据集。分析单元为个体选民(N=7,346,219)。关键自变量为BISG中使用的五种地理层级:仅姓氏、县、ZIP码、普查区、普查块。因变量为种族推断的准确性,操作化为BISG估计的种族概率总和与自报种族实际人数之间的绝对差异(每1,000次抽样中的计数差异)。研究通过10,000次自助抽样(每次抽取1,000人)来构建不确定性分布,而非仅报告静态的点估计。

Data & Sample

  • N: 7,346,219条选民记录,来自3,123,112个唯一地址
  • Population: 佐治亚州全部登记选民
  • Country/Region: 美国佐治亚州
  • Recruitment/Data-collection method: 使用佐治亚州官方选民档案(包含自报种族信息)
  • Time period: 使用2010年人口普查数据和2018年美国社区调查(ACS)数据用于ZIP码级别的种族构成估计
  • Data source: 佐治亚州选民档案;ESRI 2013街道地址和邮政地址地理编码器用于地理编码;人口普查和ACS数据用于地理单元的种族构成
  • Missing data: 仅2,065名选民(0.03%)缺少ZIP码;地理编码过程有4.6%的地址无法成功编码

Analytical Strategy

  • 核心方法: BISG(贝叶斯改进姓氏地理编码),通过wru R包实现,辅以作者开发的zipWRUext扩展包
  • 五种地理层级比较: 仅姓氏、县、ZIP码(新引入)、普查区、普查块
  • 验证策略: 将BISG推断结果与佐治亚选民档案中的自报种族进行比较
  • 统计方法: 10,000次自助抽样(bootstrap),每次抽取1,000人,计算BISG估计的种族概率总和与实际自报种族人数之间的绝对差异
  • 种族类别: 白人、黑人、西班牙裔、亚裔、其他(不属于前四类的类别)
  • 稳健性: 通过自助抽样构建不确定性分布而非单一估计;使用2010年人口普查和2018年ACS两种数据源进行ZIP码估计

Results & Findings

发现一:ZIP码与普查区在白人和黑人种族推断上几乎完全等效 ZIP码与普查区在白人推断上的中位数差异仅为每1,000次抽样−0.15人,黑人推断为0.12人。这意味着对于白人和黑人群体,使用ZIP码(无需地理编码)与使用普查区(需要地理编码)在准确性上几乎没有差别。这一发现直接支持了作者的核心假设:ZIP码可以作为普查区的替代方案。

发现二:ZIP码与普查块在白人和黑人种族推断上也无实质性差异 ZIP码与普查块在白人和黑人推断上的中位数差异分别为−1.22和1.54(每1,000次抽样)。虽然普查块是理论上最精确的地理单元,但对于白人和黑人群体,ZIP码的准确性已经足够接近,无需承担地理编码的成本和数据缺失。

发现三:普查块在亚裔和西班牙裔种族推断上显著优于ZIP码和普查区 ZIP码与普查块在亚裔推断上的中位数差异为9.21,西班牙裔为23.35(每1,000次抽样)。这意味着每推断1,000名西班牙裔选民,普查块比ZIP码平均少错约23人。对于这些群体,地理编码的额外投资是值得的——每小时的编码时间可减少1.27(亚裔)和3.21(西班牙裔)的推断误差。

发现四:县级和仅姓氏的估计误差最大 在所有种族类别中,县级估计始终表现最差,仅姓氏方法也明显不如ZIP码。作者建议这两种方法仅在无其他替代方案时才可使用。

发现五:普查区相对于ZIP码的增益几乎为零 对于白人和黑人,普查区相对于ZIP码的增益分别为−0.17和0.21(每1,000次抽样),几乎为零,但地理编码需要额外数小时。这进一步支持了ZIP码作为首选非地理编码方案的建议。

意外发现: 普查块在"其他"种族类别上的表现也优于其他方法,但作者未详细展开这一结果。

Limitations

  • 可修改面积单元问题(MAUP): 依赖地理形状文件的分析可能引入噪声,因此本文的准确性发现可视为保守估计;佐治亚的MAUP特征可能不适用于其他地理情境。
  • 种族认同的流动性: 自报种族本身可能存在误差,尤其对亚裔和西班牙裔个体而言,种族、族裔和国籍的三分法可能无法完全反映个体的实际认同。
  • 佐治亚的特殊性: 佐治亚将西班牙裔视为种族而非族裔,这一分类方式与其他州(如北卡罗来纳)不同,可能影响结果的推广性。
  • 地理编码缺失: 4.6%的地址无法成功地理编码,且数据缺失往往与种族相关,可能引入系统性偏差。
  • 计算资源限制: 加载普查块数据需要数GB空间,在纽约、佛罗里达、得克萨斯和加利福尼亚等大州可能对部分研究者构成障碍。

Key Contributions

  • 首次系统量化了BISG中五种地理层级(仅姓氏、县、ZIP码、普查区、普查块)在种族推断准确性上的权衡
  • 引入ZIP码作为BISG的新地理层级,并开发了R包zipWRUext以支持ZIP码级别的BISG分析
  • 证明ZIP码在白人和黑人种族推断中与普查块几乎等效,为研究者提供了无需地理编码的可行替代方案
  • 明确了何时必须使用地理编码(亚裔和西班牙裔推断时使用普查块)以及何时可以避免(白人和黑人推断时使用ZIP码)
  • 提供了BISG实施的顺序策略:先用非地理编码方法(ZIP码),仅在必要时使用更昂贵的地理编码方法(普查块)
  • 呼吁研究者在报告BISG实施时提高透明度,明确说明地理单元选择和缺失数据处理方式

Key Claims

"We find that when estimating the racial identification of White and Black voters, nongeocoded ZIP code-based estimates are acceptable alternatives." (Abstract)

"However, census blocks provide the most accurate estimations when imputing racial identification for Asian and Hispanic voters." (Abstract)

"ZIP codes are the superior alternative to other nongeocoded BISG processes. Furthermore, ZIP codes are effectively on par to estimates derived using census tracts without the added costs associated with geocoding." (Discussion of Applications)

"County and surname only estimates are error prone and should only be used when no other alternative is viable." (Discussion of Applications)

"We recommend that researchers incorporate ZIP codes into future BISG research. Researchers should only use more computationally costly geocoded alternatives when required; surname only and county-level analyses should only be used when all other alternatives have been examined." (Discussion of Applications)


My Notes